3. Formulation Mathématique des MDP
Un processus de décision Markovien est un ensemble composé de 4 classes $\left( {S,A,P,R} \right)$ avec:
Récompenses $r \in R$ obtenues suite aux transitions :
$S$ est l'espace des états contenant l'ensemble des états possibles
La somme des probabilités qu'un agent aille atterrisse sur un état (peu importe lequel - cela peut être le même que l'état initial) quelque soit l'action choisie est égale à 1. Cela revient à dire que l'agent transite toujours (encore une fois, cela peut être sur le même état) :
L'équation fondamentale dans l'apprentissage par renforcement est la suivante:
C'est la probabilité que l'agent aille sur l'état suivant $s'$ à l'instant $t+1$ et gagne la récompense $r$ alors qu'il est sur l'état $s$ et qu'il effectue l'action $a$ à l'instant $t$.
Il est également important de remarquer que chaque instant suivant $s'=s_{t+1}$ sur lequel l'agent transite ne dépend que de l'état initial $s_t$ et de l'action choisie $a_t$.